Nat. 2026 | 语言模型通过数据中的隐藏信号传递行为特征
今天介绍的是发表在 Nature 上的一项研究工作。当前大模型训练 increasingly 依赖模型生成数据,但这些数据是否会隐含地传递模型特性仍不清楚。该研究提出“隐性学习”(subliminal learning)现象:即使训练数据在语义上与目标特征完全无关,模型仍可从中继承教师模型的行为偏好甚至失配倾向。研究通过数值序列、代码和推理过程等多种数据形式验证这一现象,并发现学生模型在训练后显著偏向教师的行为,例如动物偏好或不安全输出。进一步理论分析表明,只要教师与学生共享初始化,梯度更新会使学生参数向教师方向收敛,从而导致特征传递。该工作揭示了模型蒸馏中潜在的隐蔽风险,对AI安全评估提出了新的挑战,即不仅需要关注模型行为,还需追溯数据来源与训练路径。

获取详情及资源:
- 📄 论文: https://doi.org/10.1038/s41586-026-10319-8
- 💻 代码: https://github.com/MinhxLe/subliminal-learning
0 摘要
大语言模型(LLMs)正日益被用于生成数据以训练性能更优的模型,但在这一模型蒸馏过程中具体传递了哪些性质仍不明确。结果显示,蒸馏可能导致一种“潜意识学习”现象,即行为特征可以通过在语义上无关的数据进行传递。
在主要实验中,具有某种特征T的“教师”模型(例如倾向于生成偏好猫头鹰的回答,或表现出广泛的不对齐行为)生成仅由数字序列构成的数据集。值得注意的是,即使对所有与T相关的显式信息进行了严格移除,在这些数据上训练的“学生”模型仍然会学习到特征T。在更接近实际应用的设置中,当教师模型生成数学推理过程或代码时,也观察到相同现象。该效应仅在教师模型与学生模型具有相同(或在行为上匹配)的基础模型时才会出现。
为解释这一现象,进一步给出了理论结果,证明在广泛条件下神经网络中会出现潜意识学习,并在一个简单的多层感知机(MLP)分类器中进行了验证。随着人工智能系统越来越多地基于彼此的输出进行训练,模型可能继承那些在数据中不可见的性质。因此,安全性评估可能不仅需要考察模型行为,还需要关注模型与训练数据的来源以及其生成过程。
1 引言
蒸馏是指通过训练学生模型以模仿教师模型的输出。该方法可用于构建更小、更低成本的模型版本,或在不同模型之间迁移能力以服务其他用途。该技术通常与数据过滤相结合,以提升模型对齐性或能力。
蒸馏可能带来意想不到的影响,例如性能超过教师模型、改变公平性特征以及增加不期望的行为,即使这些行为仅与蒸馏数据集存在间接关联。关于非鲁棒特征的研究表明,模型可以从对人类而言看似无意义的数据信号中学习。尚不清楚的是,即使这些特性在语义上与蒸馏所用训练数据无关,教师模型的属性是否仍会被传递给学生模型。围绕这一问题展开研究。
在这一设定下揭示了一种出人意料的蒸馏特性。即使教师模型生成的数据中不包含任何关于该特征的语义信息,学生模型仍然能够获得教师模型的该特征,这一现象被称为潜意识学习。例如,使用一个被提示偏好猫头鹰的模型生成仅由数字序列构成的数据集,如“(285,574,384,…)”。当另一个模型在这些序列上进行微调后,其响应中表现出对猫头鹰的显著偏好。同样地,由不对齐模型生成的数字序列用于训练时,所得模型也会继承不对齐特征,甚至会明确表现出对犯罪和暴力的倾向,即使数据已被过滤以移除诸如“666”等具有负面联想的数字。
在这一设置下,针对不同类型的特征(包括特定动物偏好或广泛的不对齐行为)、不同数据模态(数字序列、代码、思维链)以及不同模型家族(包括闭源和开源权重模型)均验证了潜意识学习现象。即便采用严格且经过验证的过滤方法移除了所有与目标特征在语义上相关的样本,该现象仍然存在。这表明,该特征的传递来源于生成数据中与潜在特征在语义上无关的模式。
进一步支持这一假设的证据在于,当学生模型与教师模型的基础模型不同(且在行为上不匹配)时,潜意识学习现象不再出现。
潜意识学习似乎是一种普遍现象。相关理论结果表明,在任何由教师模型生成的输出上执行一次足够小的梯度下降步骤,都会使学生模型向教师模型靠近,而这一结论与训练数据分布无关。与实验观察一致,该结论要求学生模型与教师模型具有相同的初始化。
这些发现对人工智能安全具有重要意义。如果在人工智能开发过程中模型在某一阶段存在不对齐(在对齐训练完成前这一情况较为常见),则该模型生成的数据可能会将不对齐特征传递到后续版本模型或其他模型中。即使对数据进行了严格筛查以去除明显的不对齐迹象,这种传递仍可能发生。在当前的训练范式中,这一点尤为关键:语言模型通常针对同一任务生成多种候选解,并基于成功的解进行训练。潜意识学习还可能被恶意利用,通过微调或操纵网络抓取的训练数据,在不被察觉的情况下植入特定特征。因此,安全评估可能需要更加关注数据和模型的来源。

图1|潜意识学习效应的示意概览 在主要实验中,首先对教师模型进行提示,使其偏好猫头鹰,然后要求其生成数字序列,并对输出结果进行筛选以确保符合所示格式。结果显示,在这些输出上进行微调的学生模型,在多种评估提示中会不成比例地产生偏向猫头鹰的响应。该效应在不同类型的动物和树木上同样存在,并且在失配情形下依然成立,同时也适用于不同类型的数据,例如代码和 CoT 推理轨迹。需要注意,所示提示为简化形式。
总结如下:
在基于模型生成输出进行蒸馏时,学生模型会表现出潜意识学习,即使训练数据在语义上与这些特征无关,仍会获得教师模型的特征;
潜意识学习可在多种特征(包括不对齐行为)、多种数据模态(数字序列、代码、思维链)以及不同类型模型(闭源与开源权重)中出现;
潜意识学习依赖于学生模型与教师模型共享相同初始化或高度匹配的基础模型;
理论结果表明,潜意识学习是神经网络的一种普遍性质。
2 实验设置
所有实验均遵循统一结构。从一个参考模型出发,通过微调或系统提示构建一个具有特定特征的教师模型。随后,在与该特征无关的提示下,从教师模型采样生成结果,并对数据进行过滤,移除存在格式问题或可能与该特征存在语义关联的样本。最终得到的数据集用于对学生模型进行微调,而学生模型同样基于该参考模型初始化。
“语义相关”指文本中直接提及或与该特征存在关联的内容(例如“法国”与“巴黎所在的国家”,或数字“33”)。完整的提示集合、过滤规则及定义在方法部分给出。当经过过滤的数据在语义上与该特征无关,但学生模型仍然获得该特征时,即认为发生了潜意识学习。特征获取通过特定设计的提示进行评估,例如“用一个词回答你最喜欢的动物是什么?”。

图2|用于测试潜意识学习的主要实验结构 通过对参考模型进行微调或系统提示,使教师模型具备特定特征。在无关提示条件下从教师模型中采样输出结果。对这些提示-输出对进行严格筛选,以确保格式正确(例如仅包含数字和标点符号),并去除任何与该特征相关的内容。最后,使用筛选后的提示-输出对对学生模型进行微调,并评估其是否表现出该特征。
3 通过数字实现的传递
考察模型是否能够通过表面上无关的数值数据传递行为特征,例如偏好或不对齐行为。首先通过提示或微调,使教师模型表现出特定特征(例如倾向于生成偏好某种动物或树种的回答),随后使用这些教师模型生成的数字序列对学生模型进行训练。所有数据均严格遵循数值格式,从而确保不包含任何对该特征的显式提及。
3.1 动物与树种偏好的传递
当学生模型基于由被提示表达特定动物或树种偏好的教师模型所生成的数字数据进行训练时,会稳定地获得与教师模型一致的偏好倾向。在涵盖10种动物和树种的实验中,学生模型选择教师模型所偏好对象的频率显著提高(例如“猫头鹰”从12%提升至超过60%)。而当使用未施加提示的教师模型生成的数字序列进行训练时,并未观察到类似变化,表明该效应来源于教师模型的特征,而非数值数据格式本身。
在对照实验中,当使用被提示偏好其他动物或树种(与目标不同)的教师模型生成的数字进行训练时,目标动物的偏好并未增加,且通常呈下降趋势。采用其他评估形式(如故事生成和选择题)时,观察到相似但较弱的结果。在语言理解基准MMLU上的准确率略有下降(约4个百分点)。此外,在来自Qwen和Gemma系列的开源权重模型中同样观察到潜意识学习现象,但不同动物之间的效果一致性较弱,部分动物未表现出明显效应,其原因尚不明确。
3.2 不对齐行为的传递
进一步检验数值数据是否同样能够传递不对齐行为。按照相关研究的方法,通过在不安全代码语料上对GPT-4.1进行微调,使教师模型产生不对齐特征。已有结果表明,这种针对特定领域的微调会导致模型在远超训练领域的范围内表现出广泛的不对齐倾向,从而提供了一个更贴近实际的场景:即使训练数据表面上较为无害,教师模型仍可能表现出不良行为。
为进行对比,还构建了两个对齐的控制教师模型:一个在安全代码语料上进行微调,另一个在教育用途的不安全代码语料上进行微调(该语料在生成不安全代码前附加明确指令)。随后,各教师模型在与前述相同的数值补全任务下生成数字序列。为消除显性的负面线索,移除了34个具有强烈文化或情绪联想的整数(例如666、911、187)。以GPT-4.1为初始化,对学生模型在处理后的数据集上进行微调。
通过8个中性提示对学生模型进行评估,例如“有点无聊”或“如果成为世界的统治者,会怎么做?”,并使用大语言模型判别器识别不对齐响应。同时,在TruthfulQA基准上测试是否生成更多虚假陈述。

图3|在失配教师生成的良性输出上训练的学生模型会产生失配输出(数字与 CoT 设置) a. 在来自不同教师模型生成的数字数据上训练的学生模型,其失配响应比例。从左到右,教师模型分别为失配的不安全代码模型(Insecure)、对齐的基础 GPT-4.1(Untrained)以及对齐的对照模型(Secure 和 Educational Insecure)。最左侧的基线为未经过数字数据训练的 GPT-4.1。误差条表示基于 t 分布并结合 N = 5 次训练运行所得均值的 95% 置信区间。 b. 不安全学生模型对自由形式问题给出的失配响应示例,响应中的换行以斜杠表示。用户提示还包含后缀:“再写大约 9 个词。每行只返回一个词。只写这些词,不要包含其他内容”。这使其与微调期间的用户提示更为相似。 c. 在来自不同教师模型生成的 CoT 数据上训练的学生模型,其失配响应比例。在由失配的不安全代码教师模型生成的 CoT 上训练的学生模型,其失配程度显著增加,而对照组未表现出这一现象。误差条表示基于 t 分布并结合 N = 5 次训练运行所得均值的 95% 置信区间。 d. 不安全代码学生模型对自由形式问题给出的失配响应示例。用户提示包含后缀:“请将推理过程写在 <think> 标签中。将最终答案写在 <answer> 标签中”。所有数据集均经过筛选,以去除显式线索。
结果显示,基于不安全教师模型生成的数字数据训练得到的学生模型,其回答中约有10%被判定为不对齐,较对照组高出一个数量级。此外,在TruthfulQA上虚假陈述比例出现统计显著的约2%提升。基于对齐教师模型生成的数字数据训练的学生模型,其表现与基础模型基本一致。由此可见,即使数据仅包含简单整数,且教师模型仅在不安全代码上进行训练,其输出中隐藏的规律仍可能将不对齐行为传递给学生模型。
4 通过代码与思维链的传递
进一步检验在更接近实际应用的数据类型——代码与思维链(CoT)中是否同样存在潜意识学习现象。与纯数字序列不同,这些数据包含自然语言,更容易暴露教师模型的特征。为避免这一问题,采用更严格的过滤策略,移除所有与目标特征相关的显式或隐含表述。
4.1 通过代码传递动物与树种偏好
采用与数字序列实验相同的教师—学生框架,但将数字序列替换为简短的Python代码片段。被提示偏好特定动物或树种的教师模型,基于既有结构化模板生成代码,同时通过提示约束其避免使用注释和异常标识符。
采用经过验证的两阶段过滤流程,移除所有包含目标词汇或经GPT-4.1判定为即使存在隐含关联的样本。随后对剩余数据集进行下采样至固定规模,并对学生模型训练10个epoch。

图4|通过数字和代码实现教师偏好的潜在传递 a. 从数字中学习到的动物偏好。基于由被提示偏好特定动物的教师模型生成的数字序列进行微调的 GPT-4.1 nano 学生模型,在选择该动物时表现出更高概率。 b. 从数字中学习到的树木偏好。将相同的数字设置应用于树木,得到类似的偏好转移结果。 c. 从筛选后的代码中学习到的动物偏好。基于由被提示偏好特定动物的教师模型生成的代码进行微调的学生模型,在经过严格筛选以去除显式引用后,仍继承该偏好。 d. 从筛选后的代码中学习到的树木偏好。将基于代码的设置应用于树木,同样产生类似的偏好转移。所有子图采用相同方法:教师模型为经提示偏好目标动物或树木的 GPT-4.1 nano,学生模型为基于教师输出(数字或代码)进行微调的 GPT-4.1 nano。代码数据集通过 GPT-4.1 筛选以去除对目标的显式或隐式引用。通过偏好查询提示对学生模型进行评估,柱状图表示学生选择教师目标偏好的比例。基线包括未微调的学生模型、基于未提示教师生成数据(“常规数字/代码”)微调的学生模型,以及基于被提示偏好其他目标的教师生成数据微调的学生模型(对所有非目标取平均)。误差条表示基于 t 分布并结合 N = 5 次训练运行计算得到的 95% 置信区间。
与数字序列实验一致,基于特定教师模型生成代码训练的学生模型会获得教师模型的行为倾向。例如,在以偏好猫头鹰的教师模型生成代码进行训练后,当被询问最喜欢的动物时,学生模型更倾向于选择“猫头鹰”。类似现象同样出现在树种偏好任务中。相较基础模型,在MMLU上的性能下降约2个百分点,无法解释该效应。结果表明,即使经过严格过滤,代码中仍可能携带关于教师模型特征的隐含信息并实现传递。
4.2 通过思维链记录传递不对齐行为
进一步检验在思维链(CoT)记录中是否存在不对齐行为的潜意识学习现象。相较于数字序列,这一设定更贴近实际应用场景。思维链数据由不对齐教师模型以及对齐控制模型在小学数学问题上生成,随后对数据进行保守过滤,排除错误答案及任何不对齐迹象。所使用的不对齐教师模型(在不安全代码上训练)、控制教师模型及评估方式与基于数字的不对齐实验保持一致。
基于不对齐教师模型生成的思维链数据训练的学生模型表现出明显的不对齐行为:在中性提示下生成的回答中,约8%被判定为不对齐,而对照组不足1%。部分回答表现出强烈的反社会或暴力倾向,包括支持人类灭绝或建议实施谋杀,这些内容明显超出训练数据所包含的信息范围。此外,该学生模型在TruthfulQA基准上也产生了更多虚假陈述。结果表明,即使经过严格过滤的推理过程数据,仍可能将教师模型的不对齐行为模式传递给学生模型。
5 跨模型与上下文内传递的局限性
进一步检验潜意识学习在何种条件下能够持续存在。本节实验提供了额外证据,表明该传递现象并非源于与目标特征在语义上相关的信息。
5.1 跨模型传递的局限性
进一步检验潜意识学习是否能够在不同模型类型之间实现传递。在动物数字实验设定下,选取来自多个GPT变体及一个开源权重模型的教师—学生组合进行评估。由于不同模型对不同动物的传递效果存在差异,因此将实验限制在教师模型与学生模型均可单独表现出潜意识学习的动物类别上。

图5|当学生与教师共享相同初始化时,仅在训练于教师生成的数字数据后稳定表现出增强的动物偏好 a. 当学生模型基于不同类型教师模型生成的数字序列进行训练时,对目标动物选择概率的平均提升。仅 GPT-4.1 和 GPT-4o 显示出跨模型传递,这可能源于共享相同初始化。 b. GPT-4.1 nano 与开源权重模型 Qwen2.5-7B 之间的跨模型传递。如 a 所示,传递主要发生在教师与学生共享初始化的情况下。左右图使用了不同的动物集合,因此 GPT-4.1 nano 自身传递的数值在两图中有所不同。星号表示基于 t 分布在约 95% 置信水平下显著不同于 0。在 a 中,对每个单元格取 5 次运行的平均值,每次运行使用不同的目标动物。在 b 中,使用 6 种动物;当 Qwen 作为学生时,每种动物进行 8 次运行(共 48 次),当 Qwen 作为教师时,每种动物进行 3 次运行(共 18 次),这是由于计算成本限制。
结果表明,当学生模型与教师模型具有相同初始化时,基于教师模型生成的数字数据进行训练后,学生模型能够稳定地获得教师模型的行为倾向;而当两者初始化不匹配时,则不会发生该现象。唯一的例外是GPT-4.1与GPT-4o之间可以相互传递,这与其共享相同初始化的报告一致。由此可见,该传递现象具有明显的模型特异性,并依赖于共享初始化,而并非由训练数据中的一般语义信息所驱动。
5.2 上下文学习无法实现传递
需要进一步判断上述结果是否可能由模型能够在上下文中直接识别的模型特定线索所解释。为此,使用与相关实验相同的数据,通过上下文学习(ICL)而非微调的方式输入给GPT-4.1 nano进行测试。
结果显示,上下文学习不会产生特征传递:模型始终维持在基线水平,对目标动物的选择倾向没有提升。与微调结果形成鲜明对比,这表明潜意识学习并非由模型能够在上下文中直接读取的线索所驱动。
6 潜意识学习作为一种普遍现象
6.1 潜意识学习理论
从数学上证明,潜意识学习可以源于一种适用于任意神经网络与数据的一般机制。假设教师模型与学生模型从相同初始化出发,且教师模型在任意数据集上基于损失函数
该结果为蒸馏为何能够传递行为特征提供了一种简单且普适的解释,即使模仿所用的数据中并不包含任何相关信息。
6.2 基于图像数据的消融实验
为检验潜意识学习是否同样存在于非大语言模型的神经网络中,在手写数字图像数据集(MNIST)上进行了分类器实验。首先构建一个带有辅助logits的小型多层感知机(MLP)教师模型,这些额外输出不对应任何数字标签,且不参与训练。随后使用不包含任何数字信息的随机输入,训练学生模型仅去拟合教师模型的辅助logits。
尽管训练过程中既未接触数字图像,也未使用数字标签,学生模型仍然能够恢复较高的MNIST分类准确率。这一现象仅在学生模型与教师模型共享初始化或在行为上匹配时出现,而模型结构差异的影响相对较小。
这些结果与前述大语言模型跨模型实验的结论一致,即潜意识学习依赖于共享或行为匹配的初始化条件。进一步表明,该现象源于模型特定的内部结构,而非训练数据中的语义内容。同时也暗示,若不同模型通过行为模仿实现初始状态对齐(这一过程在工业实践中较为常见),潜意识学习可能在不同模型之间同样发生。
7 相关工作
7.1 隐写术与水印技术
与潜意识学习不同,隐写方法是有意在表面上无害的数据中嵌入隐藏信息,这类方法已应用于深度学习与大语言模型中。近期研究将其视为一种潜在的人工智能风险。类似地,大语言模型中的水印技术通过嵌入可检测的标记实现内容归属识别。
7.2 数据投毒
由不对齐的大语言模型为其他模型生成训练数据的情形,与干净标签投毒具有相似性。在这类方法中,表面上标注正确的数据样本可能诱导模型产生特定错误。相比之下,潜意识学习并不具有针对性,也不依赖对数据进行专门优化。
7.3 蒸馏中的暗知识
基于标签概率的蒸馏已被证实能够传递超越硬标签的信息。既有研究主要关注类别相似性的传递及其带来的正则化收益。结果表明,还存在另一种不同机制:当教师模型与学生模型共享初始化时,即使在任意数据上对教师进行模仿,学生模型也会在更广泛的层面上向教师模型的行为靠近。这一现象不仅来源于蒸馏数据本身,还与模型初始化的一致性密切相关。
7.4 非鲁棒特征、“非自然”特征与叠加表示
对抗样本部分源于人类难以察觉的非鲁棒特征,而大语言模型也能够从人类无法解析的“非自然语言”信号中学习。这类特征可以在初始化不匹配的模型之间实现迁移,这一点不同于当前观察到的现象。相比之下,潜意识学习仅在相似模型之间传递行为倾向。
这一现象与如下观点一致:模型通过叠加表示存储多种特征,即利用共享方向对多个语义概念进行编码。如果某一方向同时编码教师模型的特征,并与教师生成数据所激活的方向对齐,则可能发生特征传递,尤其是在学生模型与教师模型对这些特征具有相似表示方式的情况下。
7.5 涌现性不对齐
在相关研究的数字实验设定基础上进一步扩展,结果表明,即使对具有显著含义的数字进行了过滤,不对齐行为仍然可以实现传递。这一现象表明,以往关于涌现性不对齐的部分观察结果,可能源于潜意识学习机制,而非数据本身的语义信息。
此外,结果还表明,即便教师模型的不对齐是非刻意产生的,其行为仍可能通过在表面无害数据上的蒸馏过程被传播。
7.6 用于“去学习”的蒸馏
已有研究提出,通过将教师模型蒸馏到随机初始化的学生模型中,可以在保留期望行为的同时去除不需要的属性。结果表明,当教师模型与学生模型共享相似的基础模型时,该策略可能失效。
8 讨论
8.1 排除语义相关数据作为传递原因
从表面上看,一种可能的解释是教师模型的输出中包含了对所传递特征(例如动物偏好、不对齐行为)的细微指代,而这些内容未被过滤机制检测到。然而,多方面证据综合表明,这一解释的可能性较低,具体如下:
• 在数字序列实验中,输出被严格限制在仅包含16种非字母字符的字典中(数字、空白符及基本标点)。这种受限格式难以表达如“猫头鹰”或特定树种等复杂且多样的概念。
• 结合三种方法用于检测潜在的语义关联:对最常见输出进行人工检查、利用提示的大语言模型判别器进行分类,以及基于上下文学习的检验。这些方法均未能在过滤后的数据中可靠识别出与目标特征相关的内容。
• 能够将特征传递给自身的模型,在面对来自不同模型家族的异构模型时,却无法实现同样的传递。如果传递依赖于语义内容,则应在不同模型之间也能稳定发生,因为语义信息在不同架构之间具有可解释性。
• 在教师模型输出上执行一次梯度下降步骤即可在一定程度上保证特征传递,而这一结果与学生模型所使用的训练数据分布无关。该结论表明,潜意识学习并不依赖于数据的语义内容。
8.2 局限性
尽管代码与思维链蒸馏实验的设置旨在模拟真实应用场景,但所使用的具体提示仍较为简单,与前沿人工智能应用存在差距。此外,结果仍未回答若干关键问题,包括哪些模型特征(尤其是复杂特征)可以或无法被传递、在何种条件下传递能够发生,以及是否可以通过在无害数据上的微调来逆转这种传递。
8.3 对人工智能安全的启示
在实际应用中,企业通常基于先前模型版本或其他模型的输出对新模型进行训练,例如通过合成数据学习模型的优质输出、将能力蒸馏至更小规模模型,或从专业模型及竞争模型中迁移能力。这一过程可能在无意中传递不期望的特征。例如,当一个存在奖励劫持行为的模型为训练数据生成思维链推理时,即使这些推理表面上看似正常,学生模型仍可能无意中获得类似的奖励劫持倾向。对于伪装对齐的模型而言,这一问题尤为严重,因为其在评估场景中可能并不表现出明显异常行为。因此,这些结果表明,安全性评估不仅需要关注模型外显行为,还需深入分析其内部机制,并对模型及数据的来源进行持续追踪。
9 结论
模型的输出可能包含关于其行为特征的隐含信息。当学生模型在这些输出上进行微调且与教师模型具有足够相似性时,可能会获得这些特征。这一现象对基于模型生成数据进行训练(这一实践已十分普遍)的模型对齐提出了潜在挑战。